本篇階段:更好的提示詞
使用介面:claude.ai(提示詞設計)/Gemini Notebook(實際執行)
自從台股第一次衝上4萬點,我就決定要用 LLM 幫我賺大錢,雖然還沒賺到QQ不知不覺養成一個習慣,會在開盤日與周日把幾個台灣財經 YouTube 頻道當天的內容,整理成一份可以貼給家人、好友看的摘要內容,但實際做這件事的不是 Claude,是 Gemini Notebook (前身為 NotebookLM),因為它可以直接吃 YouTube 來源並自動生成文字。
我為這件事維護一份專用提示詞,演化史大概長這樣:
今天不是要講「把提示詞寫長了所以變好了」,今天要講的是兩件事:
所以 Day 03 的真正主題是:把 Claude 當提示詞工程師,去為另一個能力較弱的模型寫指令,以及這件事會怎麼失控。
| v1 | v2 | v3 | |
|---|---|---|---|
| 長度 | 14 字 | 約 900 字 | 約 1500 字 |
| 語言 | 中文 | 英文 XML 標籤 | 全中文 |
| 輸出格式 | 未指定 | Markdown(含表格) | 純文字(・|【】━━━) |
| 代號規則 | 無 | 「不確定就標待確認」 | 「非影片來源一律寫代號未提供」 |
| 網址 | 無 | 要求輸出「影片網址」 | 全面禁止出現任何網址 |
| 分析師單位 | 無 | 一人一區塊,不可合併 | 同上,再加跨頻道合併與衝突並陳 |
| 自查 | 無 | <self_check> 四條 |
七問,且明令不得印出 |
一句話總結這條演化線:
v1 假設模型知道我要什麼;v2 假設模型能自我驗證;v3 假設模型什麼都不能被信任,只能被限制。
這不是對模型的悲觀,是對這個特定模型的務實。下面逐條拆,然後用實測資料檢驗每一條到底有沒有效。
這是 v2 → v3 最大的單一改動。
v2 寫成英文 XML 結構,理由很單純:平常給 Claude 寫規範就是這樣寫的,<role> <hard_rules> <output_structure> 這套在 Claude 上又穩又省 token,以為這是可移植的好習慣。
結果是:Gemini 對提示詞語言過度敏感,v2 有時候會直接產出英文內容。
注意是「有時候」,是間歇性的、局部的,不一定整份報告,而有時候重新再跑一次就又變成正常的。
而 v2 明明有寫語言指令:
- Language: 台灣繁體中文(用語習慣:台股、外資、投信、主力、法人)。
指令是中文寫的、內容也指名繁體中文,但它被包在一整份英文提示詞裡,實務上的結果是:指令的語言本身就是一個訊號,而且它的權重可能大過指令的內容。
我的解讀是:一句「請用繁體中文」是一條聲明,而整份英文提示詞是一個持續存在、貫穿全文的語境,當模型的指令遵循能力不夠強時,語境會壓過聲。
所以 v3 的處理方式不是「把語言指令寫得更大聲」(例如加 ALL CAPS 或重複三次),而是直接消除矛盾訊號:整份提示詞改成中文,連標籤都改成中文的【】區塊。輸出語言與指令語言一致,就沒有東西可以拉扯。
通則:對能力較弱的模型,提示詞的語言、格式、語氣本身就是指令的一部分。
與其用一條指令去對抗整份提示詞的體質,不如改掉體質。
順帶一提,這也解釋了 v2 的另一個毛病:v2 的格式白名單寫著「只允許 # ## ###、-、表格」,但這份提示詞本身滿滿都是 Markdown,等於是在用 Markdown 示範怎麼不要用 Markdown。
實測結果(見第 9 節): 這次跑的 v2 沒有出現英文段落,語言飄移 0 次,所以這條改動在本次實測中無法被驗證,它防的是一個間歇性問題,三次取樣抓不到,為「未觸發」,而不是「已解決」。
這是整份提示詞裡最重要的一條演化,也是實測中最強烈命中的一條。
v2 的寫法:
b. Match the ticker against your verified knowledge (台股 four-digit e.g. 2330;
美股 e.g. NVDA). If not 100% certain, write 「(代號待確認)」.
Guessing a ticker from memory is prohibited.
v3 的寫法:
股票代號:只有影片中有人唸出、或畫面明確出現數字時才可以寫,其餘一律寫「代號未提供」。嚴禁憑記憶推測代號,錯代號比沒代號嚴重得多。
兩者看起來都在講同一件事,實際上是兩種完全不同的機制。
v2 是校準機制:它承認模型的內建知識是合法來源,只要求模型在使用前評估自己的確定性。這需要模型具備良好的信心校準(confidence calibration),知道自己不知道。
實測結果是殘酷的:v2 全文寫了 24 個代號,「(代號待確認)」出現 0 次。
不是它每個都對,是它完全沒有啟動不確定性機制,它不覺得自己不確定,而其中至少三個代號看起來是錯的(詳見第 9 節)。
這正是弱模型的典型失敗模式:它不會保守,它會很有自信地錯。
v3 換了一套機制,改成來源白名單:合法的代號來源只有兩個,要有人唸出來、畫面上有數字,模型的內建知識被整個排除在合法來源之外。
這就不再需要模型評估自己了,它不必知道自己知不知道,它只需要回答一個事實問題:「影片裡有沒有出現這個數字?」這是檢索問題,不是自省問題,而檢索是弱模型做得到的事。
實測結果:v3 標了 22 次「代號未提供」,錯誤代號降到 1 個。 這條有效。
同一個模式在 v3 裡出現了三次:
| 欄位 | v2(要求判斷) | v3(封閉來源) |
|---|---|---|
| 股票代號 | 比對你的已驗證知識 | 只有影片唸出/畫面出現 |
| 影片標題與頻道 | 未規範 | 【來源對照表】是唯一合法來源 |
| 日期 | 「影片討論的日期」 | 依序取自影片內容 → 影片標題 → 寫「日期待確認」 |
通則:對弱模型,不要下需要自省的指令,要下可以查表的指令。
這條是實測中命中最乾淨的一條。
v2 的輸出結構最後有這一段:
## 資料來源
- [1] 影片網址
- [2] 影片網址
看起來完全無害。但仔細想一下:模型手上有網址嗎? 在 Gemini Notebook 的情境下,來源是被掛載進去的,模型未必能取得可靠的原始 URL 字串。
於是模板要求它填一個它拿不到的欄位,而模型不會空著,實測 v2 產出了這五行:
- https://www.youtube.com/watch?v=R9KExkS3N2Y
- https://www.youtube.com/watch?v=0hWqYvYp8C4
- https://www.youtube.com/watch?v=NnshZ0X7hD0
- https://www.youtube.com/watch?v=mD-09Y7VIdM
- https://www.youtube.com/watch?v=N_S9YfG9_p8
五個。格式完美,十一個字元的 video ID 一個不差,點下去全部無效。
這件事的教訓不是「模型愛編網址」,而是:
模板上的每一個欄位,都是一次隱性的產出要求,凡是模型不可能取得的欄位,留在模板裡就等於在點餐。
v3 用了兩層防線,第一層是移除誘因,把網址抽出提示詞,改成一份由我提供的對照表:
【來源對照表】這是唯一合法的標題與頻道名稱來源
[1] 標題 | 頻道
第二層是明文封鎖:
全文嚴禁出現任何網址、連結、youtube.com、youtu.be、影片 ID 或 https 開頭的字串。⋯⋯網址由我自己補上,你不要產生。
注意 v3 這條的寫法有個細節:它不只寫「不要寫網址」,而是把所有變體都列出來,這是因為「不要寫網址」對弱模型來說是抽象概念,而 youtu.be 是可以字串比對的具體目標。
最後那句「網址由我自己補上」也很關鍵,它給了模型一個合理的世界觀來解釋為什麼不需要網址,而不是留下一個懸而未決的缺口讓它想去填。
實測結果:v3 出現 0 個網址,而且來源區塊改成完整的標題+頻道,五筆全部與對照表一致。 這是三版對照裡最漂亮的一組數據且100% 有效,而且沒有副作用。
v2 輸出 Markdown,v3 輸出純文字。原因不在模型,在LINE。
v3 開頭第一句就把通路寫死了:
把來源影片壓成一份純文字報告,我要直接貼到 LINE 給家人看,15 分鐘內讀完(4000~6000 字)。
而格式段落是這樣:
純文字輸出,LINE 不會渲染 Markdown,嚴禁使用
#***-|>---與程式碼區塊。項目符號用「・」,欄位分隔用「|」,次分類標題用【】,章節分隔線用一行 ━━━━━━━━。emoji 只出現在章節標題與分析師姓名前,內文不放。每行約 30 個中文字內,段落之間空一行。
這一整段的每個決定都可以回推到一個實體限制:
| 規則 | 為什麼 |
|---|---|
| 禁 Markdown | LINE 不渲染,**粗體** 會變成字面上的星號 |
用 ・|【】━━━ |
全形符號在中文字體下對齊穩定,不需渲染 |
| emoji 只在標題 | 手機上內文塞 emoji 會嚴重降低掃讀速度 |
| 每行約 30 字 | 手機直式螢幕的一行寬度 |
| 段落間空一行 | LINE 沒有段落間距,只能自己造 |
| 4000~6000 字 | 15 分鐘閱讀時間反推 |
我覺得這是整份提示詞裡最容易被忽略、但實務價值最高的一段。因為提示詞工程的直覺路徑通常是「我要什麼內容 → 怎麼講清楚」,而這一段走的是完全相反的方向:
從最下游的閱讀裝置,倒推回最上游的指令。
「每行約 30 個中文字」這種規則,坐在電腦前寫提示詞是絕對想不出來的,它只可能來自一次「貼到 LINE 之後發現整份東西根本沒法讀」的實測。
實測結果:v3 的 Markdown 殘留為 0,格式完全乾淨。 這條也有效。
但是v3 只寫了約 2400 字,目標是 4000~6000 字,缺了將近一半。 這是本次實測最出乎意料的失分,第 10 節會回來討論為什麼。
v2 的第 6 條只講了一件事:
ONE ANALYST = ONE UNIT. If a single channel/video features multiple analysts, summarize each analyst separately. Never merge their views.
它防的是「一支影片裡兩個來賓被寫成一個人」。
v3 的第 5 條處理的是完全不同的問題:
報告以分析師為單位,不是以影片為單位。同一位分析師上了多個頻道,合併成一個區塊,頻道名稱與來源編號全部列出;他在不同影片說法不一致或後來改口時,兩種說法都要寫並各標來源編號。⋯⋯計算共識人數時,一人不論上幾個頻道都只算一位。
這條規則裡藏了三個獨立的失敗案例:
(1)同一人被拆成三塊。 台灣財經圈的來賓跨頻道通勤是常態,同一位分析師一天上三個節目很正常。以影片為單位整理,他就會出現三次。
(2)同一人被算成三票。 這是更嚴重的。v3 第 6 條規定「一致看多/看空需要兩位以上分析師才成立」,如果一個人上三個頻道被算成三票,那一個人的意見就會被誤判為共識。
(3)改口被抹平。 合併有一個副作用:當同一個人在早上的節目說看多、下午的節目改口,摘要員的本能是「取最新的」或「取折衷」。但對讀者來說,「他今天改口了」本身就是最有價值的訊息。
實測結果: 這條部分有效,但留了一個洞。
有效的部分:本次來源裡林漢偉同時出現在 [1] 自己的頻道與 [2] 理財達人秀,v2 與 v3 都正確合併成一個區塊、也都列出兩個頻道名稱,共識計數也都只算他一票。
沒做到的部分:v3 沒有列出來源編號。 鐵則 5 明文要求「頻道名稱與來源編號全部列出」,輸出模板也寫了 👤 (姓名) [1][3],但 v3 實際輸出只有:
👤 林漢偉
(頻道:林漢偉分析師-摩爾證券投顧、理財達人秀 EBCmoneyshow)
編號整份報告一個都沒出現。 而這會連帶讓「說法不一致時兩種都寫並各標來源編號」這條完全失效,沒有編號,讀者無法分辨哪句話出自哪一集。
猜測:來源編號在模板裡出現的位置是姓名後方 [1][3],而 v3 的分析師區塊改成了兩行式(姓名一行、頻道一行),模型照著新的視覺結構走,把編號吃掉了。模板的視覺形狀,會壓過模板旁邊的文字說明。
這一節是實測跑完之後才長出來的,也是整篇最重要的發現。
v2 的 <self_check> 四條的最後一條是:
The overview section reflects only views that actually appear in the analyst sections below it.
(總覽區只反映確實出現在下方分析師區塊中的觀點。)
v3 的七問自查沒有這條。 v3 只問了:
共識區每個產業與個股是否各佔一行並寫出人名?
注意這兩句話檢查的是完全不同的事。 v3 只檢查「有沒有寫人名」,不檢查「那個人名站不站得住」。
把 v3 共識區的每一條,逐條回去對分析師區塊:
| v3 共識條目 | 掛的人名 | 分析師區塊實際支持 |
|---|---|---|
| 貨櫃航運 看多 | 林漢偉、李永年、劉育綸、宛瑩 | 林漢偉、李永年(2/4) |
| 機器人 看多 | 林漢偉、李永年、宛瑩 | 林漢偉、李永年(2/3) |
| 光學鏡頭 看多 | 林漢偉、李永年、楊雲翔 | 只有林漢偉(1/3) |
| 台光電(6213)看多 | 林漢偉、李永年、劉育綸 | 只有林漢偉(1/3) |
| 川湖(2059)看多 | 林漢偉、李永年 | 只有林漢偉(1/2) |
| 索羅門(2359)看多 | 林漢偉、李永年 | 只有林漢偉(1/2) |
| 光寶科(2301)看多 | 李永年、楊雲翔、宛瑩 | 只有李永年(1/3) |
| 計家(2376)看空 | 林漢偉、李永年、劉育綸 | 只有李永年(1/3) |
| 旺矽 看空 | 劉育綸、宛瑩 | 兩人區塊都沒提(0/2) |
九條共識條目,只有兩條的人名可以完整回溯。
而且有一條是直接自我矛盾的:
一致看空【產業/主題】
・傳統伺服器代工(短線量縮)|看空者:林漢偉、劉育綸
👤 劉育綸
・看好產業:CPO、ABF 載板、PCB 上游材料、散熱、伺服器代工
同一份報告裡,劉育綸同時是伺服器代工的看空者與看好者。
v2 也有同類問題(技嘉被列為李永年+劉育綸一致看空,但劉育綸的區塊寫的是「回落後可找買點」),但 v2 的規模比 v3 小,因為 v2 的共識區只列了 5 檔個股 + 4 個產業,而 v3 列了 6 檔 + 5 個產業。
原本以為第 6 條(共識需兩人以上)是一個提高標準的規則,實測說明它同時是一個湊數的誘因:
當模型判斷「這檔股票很重要,應該進共識區」,而它只找到一個人提過,它面前有兩條路:放棄這個條目,或者再湊一個人名。
而模板的形狀在暗示它選第二條:・(股名)(代號)|看多者:(甲)、(乙) 括號裡有兩個位置。
規則越多,不代表越嚴謹。新規則會製造新的湊數壓力,而模板的形狀會決定模型往哪個方向湊。
要把 v2 那條自查原封不動搬回來,而且改寫成中文的、更具體的檢查動作:
共識區每一個人名,是否都能在下方該分析師的區塊裡找到對應的句子?找不到就把那個人名刪掉;刪到只剩一人時,整條移出共識區,放回他自己的區塊。
關鍵是最後那半句,光說「找不到就刪」不夠,模型會刪掉人名但留著條目,變成單人共識,那還是違反第 6 條,必須把「刪除後怎麼辦」也寫出來,否則只是把一個違規換成另一個違規。
實測還暴露一個我完全沒在提示詞裡處理的問題類別:中文股名的同音誤聽。
三個版本都有,而且 v3 最嚴重:
| 正確股名 | v1 寫的 | v2 寫的 | v3 寫的 |
|---|---|---|---|
| 欣興 | 新興 | 欣興(3037)✓ | 新星(3037)/星星(3037)/新 星(代號未提供) |
| 緯穎 | 緯穎 ✓ | 緯穎(6669)✓ | 維影(669) |
| 技嘉 | — | 技嘉(2376)✓ | 計家(2376) |
| 聯亞 | 連亞 | 連亞(3081) | 連雅(3081) |
| 宏捷科 | 紅捷科 | 宏捷科(8086)✓ | 紅杰科(代號未提供) |
| 波若威 | 波若威 ✓ | 波若威(3163)✓ | 波羅威(3163) |
| 南亞科 | — | 南亞科(2408)✓ | 南雅科(代號未提供) |
| 嘉晶 | — | 嘉晶(6488) | 嘉金(代號未提供) |
| 志聖 | — | — | 志 聖 |
有三個現象值得單獨講。
(1)v3 的股名品質明顯比 v2 差。 這很反直覺,因為假設是:v2 有一條「Write the stock name exactly as spoken」,v3 把這條併進代號規則裡變成「同音近音股名無法確定是哪一檔時,照聽到的寫並標『(股名待確認)』」,而 v3 實測全文出現「(股名待確認)」0 次。 又一條校準型指令失效。
(2)同一檔在同一份報告裡出現三種名字。 欣興在 v3 裡是「新星(3037)」(共識區)、「星星(3037)」(林漢偉區塊)、「新 星(代號未提供)」(劉育綸區塊)。代號還時有時無。 這是很糟的失敗模式,讀者完全無法把三筆資訊連起來,甚至會以為是三檔不同的股票。
(3)「維影(669)」牽出一個離奇的幻覺。 v3 給的理由是:
・維影(669)|看多|信心高|長線
理由:股價超過代號,新一代伺服器如期出貨。
「股價超過代號」是一句在正確語境下有意義的話,緯穎(6669)股價確實遠高於 6669 元這個數字,財經節目會這樣講,但模型把代號聽錯成 669 之後,這句話就變成純粹的胡話,而它照樣寫進去了。
這是幻覺最惡質的一種形態:一個正確的事實,因為錯誤的實體識別,變成了無意義的斷言,而且外觀完全正常。
受測環境:Gemini Notebook
日期:2026/08/17(星期一)
來源:同一批 5 支影片(林漢偉分析師-摩爾證券投顧、理財達人秀 EBCmoneyshow、艾綸說、元大投顧財金頻道、老王愛說笑)
各版本各跑 1 次
| # | 缺陷指標 | v1 | v2 | v3 |
|---|---|---|---|---|
| 1 | 疑似錯誤股票代號 | 0(未寫任何代號) | 3(待查證) | 1 |
| 2 | 寫出的代號總數 | 0 | 24 | 9 |
| 3 | 標「(代號待確認)/代號未提供」次數 | 0 | 0 | 22 |
| 4 | 標「(股名待確認)」次數 | 0 | 0 | 0 |
| 5 | 幻覺網址/影片 ID | 0 | 5 | 0 |
| 6 | 分析師區塊數 | 0(完全不分人) | 6 | 6 |
| 7 | 共識條目中無法回溯的人名歸屬 | 不適用 | 部分 | 9 條中 7 條 |
| 8 | 殘留 Markdown 符號 | 大量(### ** *) |
大量(設計如此) | 0 |
| 9 | 輸出語言飄移(英文段落) | 0 | 0(未觸發) | 0 |
| 10 | 自己加的投資建議 | 有(第四節整段) | 0 | 0 |
| 11 | 股名聽打錯誤 | 2 | 1 | 7 |
| 12 | 字數(目視估算) | 約 1100 | 約 2500 | 約 2400 |
| 13 | 對照目標 4000–6000 字 | 嚴重不足 | 不適用(v2 未設字數) | 不足約 40% |
| 14 | 日期格式 | 正確 | 符合 v2 規格 | 不符鐵則 4(2026/08/17 應為 20260817) |
#1、#2、#3 是本次最重要的三行。 把它們一起讀:v2 寫了 24 個代號、零個不確定標記、三個疑似錯誤。v3 只寫 9 個代號、22 個「代號未提供」、一個錯誤。
代號錯誤率從 3/24(12.5%)降到 1/9(11%),幾乎沒變。 真正改變的是分母:v3 不再對它不確定的東西發言。
v3 實際上做的是降低發言量。沒有讓模型變準,只是讓它少說話。 而對一份投資摘要,少說話正是適合的。
#1 的三個疑似錯誤代號(v2):
#4 是完全失敗的一項。 v3 明文寫了「同音近音股名無法確定是哪一檔時,照聽到的寫並標『(股名待確認)』」,實測 0 次。同時 #11 的股名錯誤有 7 個。規則寫了,但完全沒被執行。 這跟 v2 的「(代號待確認)」0 次是同一種失敗,凡是要求模型評估自己確定性的指令,在這個模型上都是裝飾品。
#5 是最乾淨的。 5 → 0,禁令完全有效,且無副作用。
#6 揭露 v1 的真正問題不是「不精確」,是「結構性錯誤」。 v1 沒有任何分析師區塊,它把六個人的觀點全部打散重組成「大盤與資金動向/核心產業焦點/總體經濟/投資策略建議」四個主題章節。這在摘要技術上很流暢,但對我的需求是完全錯的產出:我要的是「誰說了什麼」,它給我的是「市場的共識是什麼」,而後者是它自己合成的,沒有任何一個人真的那樣說。
#7 是 v3 唯一的明顯退步,原因見第 7 節。
#10 是 v1 特有的問題。 v1 自己加了整段「四、投資策略建議」:分批佈局、關注毛利率、短打與波段並行,這三條沒有掛任何人名,讀起來就像是報告作者的建議。對投資摘要來說,這是最危險的一種汙染,不會知道那不是分析師講的,v2 與 v3 都靠明文禁令擋掉了。
#13 是本次最出乎意料的失分。 v3 只寫到 2400 字,離 4000–6000 的下限還差 40%。我的假設是:規則的抑制效果溢出了。 當用七條鐵則反覆強調「影片沒提到的整行刪除」「禁止推論」「禁止補空缺」,模型的整體傾向會變保守,它不只在該省略的地方省略,也在該展開的地方省略。看 v3 的個股理由,每一條都被壓縮成一句話,而 v2 的個股觀點明顯更長更具體。
這是一個真實的權衡:用來壓制幻覺的力道,同時也壓制了資訊量。 這條暫時沒有好答案,之後打算試著把字數要求從「4000~6000 字」改成更具體的「每位分析師區塊不少於 400 字,個股理由不少於 25 字」,把總量目標改成分項下限,因為分項下限比較不容易被「該刪就刪」的規則覆蓋。
必須把這幾點寫清楚,否則上面那張表會被過度解讀:
把上面所有東西收攏成可複製的流程。重點是:每一步都不是叫 Claude「優化」,而是叫它做一件很窄的事。
最沒效率的問法是「幫我寫一個財經摘要的提示詞」,Claude 會憑一般常識給一份四平八穩、但完全沒對到痛點的東西。
有效的問法是把 v1 的爛結果貼上去,然後問:
這是我用「幫我摘要這些財經節目講的內容」跑出來的結果。
請找出所有「模型自己補上、但來源裡不該有」的地方,逐條列出。
不要改寫,不要給我新的提示詞。
這一步的產出是一份失敗清單,不是提示詞,而失敗清單比憑空想出來的規則準得多。以本次為例,v1 的第四節「投資策略建議」就是這樣被抓出來的。
這一步是我最初漏掉的。如果不明講,Claude 會按照自己的能力來寫提示詞,寫出簡潔、信任模型判斷、大量使用 XML 結構的版本,即是 v2。
要明講三件事:
這份提示詞不是給你執行的,是給 Gemini Notebook 執行的。
那個模型的指令遵循能力比你弱,而且對提示詞語言敏感,用英文寫指令時,它有時候會直接輸出英文內容。
輸出要貼到 LINE,LINE 不渲染 Markdown。
這是控制提示詞膨脹的關鍵。要求 Claude 先輸出這種東西:
| 提議規則 | 對應的失敗案例 | 實測是否有效 |
|---|---|---|
| 全文禁 https | v2 生成 5 個假 YouTube 網址 | ✅ 降到 0 |
| 代號只能來自影片 | v2 三個疑似錯誤代號 | ✅ 發言量降低 |
| 不確定就標「(股名待確認)」 | v3 七個股名聽錯 | ❌ 觸發 0 次 |
| 一人只算一票 | 跨頻道重複計票 | ✅ 但共識區湊人名 |
| 禁止自己的投資建議 | v1 的「投資策略建議」整段 | ✅ v2/v3 皆 0 |
規則若找不到對應的失敗案例,就刪掉。而實測顯示無效的規則,要換機制而不是加強語氣。
第 4 行是最好的例子:「不確定就標記」試了兩次(v2 的代號、v3 的股名),兩次都是 0 次觸發。
最後一步,把完成的提示詞貼回去:
請只做一件事:找出這份提示詞裡互相矛盾、重複、或無法同時滿足的指令。
不要改寫,不要優化,不要評論品質。只列出衝突點。
「不要改寫」這句很重要,如果不加,Claude 會很自然地順手重寫一版,然後就得重新審一次它的新版本,永遠審不完。
我原本以為提示詞是任務層級的資產,「財經摘要提示詞」寫好一份,到處都能用,實際上不是。
v2 那套英文 XML、信任模型判斷、簡潔為上的寫法,在 Claude 上是最佳解;搬到 Gemini Notebook 上,代價是五個假網址、三個疑似錯代號、零個不確定標記。
反過來,v3 那份 1500 字、把所有判斷權都收回來的提示詞,餵給 Opus 5 又是浪費,它本來就不會編網址,花三行禁止它做一件它不會做的事,只是在消耗 context。
更麻煩的是實測揭露的副作用:v3 為了壓制幻覺付出的代價,是字數只達標六成、股名品質反而下降。 那些為弱模型設計的緊縮規則,在強模型上不只是浪費,還會主動壓抑產出品質。
一份提示詞的最佳長度,與目標模型的能力成反比。而過度緊縮會有真實的產出成本。
| 強模型 | 弱模型 | |
|---|---|---|
| 指令形態 | 給判準 | 給白名單 |
| 範例 | 「不確定就標記」 | 「合法來源只有這兩個」 |
| 依賴什麼 | 模型的信心校準 | 模型的字串比對 |
| 失敗模式 | 過度保守 | 靜默幻覺 |
網址、股票代號、股名、影片標題、日期,這五樣在我的情境下都屬於「模型無法驗證」的類別。
處理方式只有兩種,沒有第三種:
「留在模板裡但要求它標註不確定」是一個看起來很聰明、實際上不成立的第三條路。實測觸發率 0%。 因為它把驗證責任丟回給一個沒有驗證能力的東西。
這條是實測長出來的第四條,本次出現了三次:
| 現象 | 文字說的 | 模板的形狀 | 誰贏 |
|---|---|---|---|
| 來源編號 | 鐵則 5:頻道與編號全部列出 | 姓名區塊改成兩行式 | 模板(編號消失) |
| 共識人名 | 第 6 條:兩位以上才成立 | 看多者:(甲)、(乙) 兩個位置 |
模板(湊出第二人) |
實務結論:改模板比改文字有效。想讓某個欄位不被填,就把它從模板拿掉;想讓某個欄位不被湊,就不要在模板裡預留固定數量的空位。
第三行給了之後一個很小但可能很有效的改動,把
・(股名)(代號)|看多者:(甲)、(乙)
改成
・(股名)(代號)|看多者:(列出所有可回溯的分析師全名)
不預留兩個括號,就少一個湊數的形狀誘因。
今天的討論好像已經太長了...明天 Day 04 要繼續把今天殘留下的疑問補完...
註一:本文對 Gemini Notebook 行為的描述,全部來自我自己在 2026 年的實際使用觀察,不是官方文件記載的規格。
註二:第 9 節的實測為單次取樣,不足以支持統計結論,請當作定性觀察而非量化證據。表中所有代號正確性判定皆未經查證,標記為待確認。
註三:本文提及的所有個股名稱與代號僅為提示詞測試素材,不構成任何投資建議。